메뉴

#이미지 처리

TD
The Decoder 10일 전
IMP 8

구글 딥마인드, 비디오 생성 모델이 컴퓨터 비전의 '세계 모델'이 될 수 있다고 주장

구글 딥마인드는 비디오 생성 모델을 컴퓨터 비전의 핵심 과제를 수행하는 '세계 모델'로 재탄생시키는 GenCeption을 발표했습니다. 이 모델은 단일 아키텍처와 극소량의 합성 데이터만으로 깊이 추정 및 분할 등에서 기존 전문 모델들을 압도하는 성능을 보여주며, 비디오 생성 AI가 3D 공간과 물리적 법칙을 이미 깊이 이해하고 있음을 증명했습니다.

컴퓨터 비전 비디오 생성 모델 구글 딥마인드
TD
The Decoder 45일 전
IMP 8

단일 텍스트 명령으로 모든 이미지 속 객체 수를 세는 AI 'Count Anything'

중국 칭화대 등 연구진이 메타(Meta)의 비전 모델(SAM3)을 기반으로 텍스트 프롬프트 하나만으로 위성 사진, 의료 스캔, 일상 사진 등 모든 이미지 내 객체의 수를 정확히 세고 표시하는 새로운 AI 모델 'Count Anything'을 발표했습니다. 이 시스템은 큰 객체는 박스로, 작고 밀집된 객체는 점으로 표시한 뒤 병합해 중복 계산을 방지하는 하이브리드 방식을 사용하여 기존 경쟁 모델들을 크게 압도하는 성능을 보여줍니다. 텍스트 기반 객체 카운팅을 위해 구축된 역대 최대 규모의 데이터셋을 학습한 이 모델은 의료, 농업, 도시 계획 등 다양한 실무 분야에서 활용도가 높을 것으로 기대됩니다.

객체 탐지 비전 AI 멀티모달